Le contexte Notre client, un grand groupe bancaire, dispose d'une direction Data/AI qui accompagne les métiers dans leurs projets de Data Science, de la génération de use case jusqu'à la mise en production. L'équipe, au format "start-up dans un grand groupe", est internationale et regroupe des Data Scientists (Computer Vision, NLP, Scoring), un pôle ML Engineering et une équipe AI Projects. Cette équipe développe et opère en interne sa propre plateforme de Data Science, qui comprend : Une plateforme d'exploration et de développement Python Un framework d'industrialisation des modèles de Data Science, avec une librairie InnerSource dédiée Une plateforme d'exécution des modèles en production Un outil de Community Management C'est une infra qui tourne actuellement sur plus de 400 containers de production, utilisée par plus de 500 utilisateurs. La mission Le client ouvre une prestation en assistance technique pour gérer l'infrastructure qui supporte cette plateforme. Concrètement, le périmètre couvre : Administration, exploitation et automatisation du système d'exploitation des clusters Build et optimisation des images Docker, run des containers de prod Construction et pilotage de la vision technique de la plateforme (choix technos, évolution d'architecture) pour garantir continuité et performance Optimisation du dimensionnement des ressources et des coûts associés Interface privilégiée avec les équipes infra groupe qui fournissent l'infra managée on-prem consommée par la plateforme Maintenance à jour des composants et contribution aux déploiements applicatifs Veille technologique et montée en compétence continue Rédaction de documentation technique (architecture, gestion des changes et des incidents) Production de livrables et partage de connaissances avec l'équipe L'équipe travaille aussi de façon transverse sur la maintenance des frameworks de Data Science Python, les pipelines CI/CD, l'observabilité des plateformes, la mise en prod des solutions IA, et participe activement aux POCs. Stack technique Langages : Python, Golang, Bash OS : GNU/Linux Orchestration : Kubernetes Infra/DevOps : GitLab CI/CD, GitOps (ArgoCD), Docker, Buildkit, Artifactory, Helm, Kustomize, CUE/Timoni Sécurité : Vault (gestion des secrets), Keycloak, JWT, OIDC Réseau : Traefik (reverse proxy) Observabilité : Prometheus, Thanos, AlertManager, Grafana Data/Cloud services : PostgreSQL, ClickHouse, Redis, Jaeger, ELK, MinIO (S3), Certmanager, External-DNS, Portworx, COS Cloud privé (environnement on-prem managé, pas de cloud public classique) Profil candidat: Compétences avancées sur Kubernetes : architecture et administration de clusters en environnement de production exigeant Connaissances solides en gestion des secrets (Vault) Bonnes compétences réseau : reverse proxy (Traefik), authentification (Keycloak, JWT, OIDC) Bonne maîtrise de GitLab et des processus CI/CD Connaissance de l'approche GitOps (ArgoCD) Compétences en observabilité Kubernetes (Prometheus, AlertManager, Grafana) Connaissances PostgreSQL appréciées Anglais correct à l'écrit et à l'oral (équipe internationale) Profil rigoureux, autonome, capable d'être force de proposition dans un environnement à forts enjeux de continuité de service Ce qui fait la différence sur ce poste : ce n'est pas un poste d'exécution pure, on cherche quelqu'un capable de porter une vision technique et de dialoguer avec des équipes infra groupe, donc une expérience confirmée en environnement complexe et multi-équipes est un vrai plus.